iT邦幫忙

2026 iThome 鐵人賽

DAY 3
0

昨天我把模糊需求拆成驗收清單,今天接著問一個更危險的問題:清單寫好了,可以直接叫 AI 自己驗自己嗎?

這就像考生交卷後,老師說:「答案你自己改,分數也自己填。」不是完全沒用,但如果最後每一題都被圈成滿分,這張考卷大概只剩情緒價值。

今天的問題:AI 能不能當自己的驗收員?

我拿昨天的文章與 Power Apps 驗收清單做一輪示範自查。任務很簡單:

請依正確性、完整性、可追溯性、可使用性、人工修正成本逐項檢查,並說明證據。

AI 很快就能確認文章有標題、小標、表格、五項框架,也能找到「請選取香水類型」、頁尾、圖片位置、儲存與匯出等需求。

但真正關鍵的不是它找到什麼,而是它無法證明什麼。

例如,文章寫了下拉選單要顯示指定文字,AI 可以確認這句需求存在,卻不能只靠文章證明 App 裡真的設定成功;它能判斷文字看起來清楚,卻不能代表第一次使用的人一定看得懂。

如果把「有寫到」誤當成「有做到」,自查就會從驗收變成自我安慰。

我把驗收分成紅黃綠三區

綠燈:適合先讓 AI 自查

這類項目有明確答案,容易重複檢查:

  • 標題、段落、指定欄位是否存在
  • 字數、格式、檔名是否符合規定
  • 問卷百分比能否重新計算
  • 表格是否有空白、重複或異常值
  • 公式、連結與檔案能否正常開啟
  • 需求清單是否逐項回報

ChatGPT 適合檢查文字、邏輯與清單;Codex 適合實際讀取檔案、執行公式、查看結構或測試功能。這些工作不是百分之百不會錯,但很適合先用機器篩掉低階問題。

黃燈:AI 先查,人類抽查

這些項目有依據,卻需要情境判斷:

  • 問卷數據是否真的支持結論
  • 市場資料是否過期或引用錯對象
  • 企畫策略能否接回競賽題目
  • 圖表是否誠實呈現差異
  • 簡報頁面是否一致又不無聊

做法不是全盤相信,也不是每個字重做。可以請 AI 標出高風險處,再由人抽查原始資料與關鍵結論。

紅燈:一定要由人確認

這些事情不能只靠自動勾選:

  • 是否洩露不該公開的資料
  • 競賽提案是否真的符合評審情境
  • 訪談或問卷是否被過度解讀
  • 內容會不會讓真人誤會
  • 最終交付、發布與重要決策

AI 可以提醒,但責任不能外包。

今天抓到的三個自查漏洞

第一個漏洞是把文字存在當成成果存在。修正方式:要求附上畫面、計算過程、檔案位置或測試結果。

第二個漏洞是不確定也硬給結論。修正方式:答案只能使用「已驗證、合理推測、無法驗證」三種狀態,不准全部寫完成。

第三個漏洞是自己訂標準、自己宣布及格。修正方式:驗收條件必須在任務開始前先固定,不能看到成果後才偷偷放寬。

五項框架再驗一次

查核項目 AI 適合做什麼 人要補什麼
正確性 重算、比對、找矛盾 核對原始資料與情境
完整性 逐項掃描需求 確認需求本身沒有漏
可追溯性 整理來源與對照表 判斷來源是否可信
可使用性 檢查格式與操作步驟 請真人實際使用
人工修正成本 記錄錯誤與修改項目 評估時間是否真的省下

這張表讓我更確定:AI 很適合當第一層濾網,但不適合獨占最後一個印章。

可直接使用的自查指令

請依驗收清單逐項檢查,每項只能標記「已驗證、合理推測、無法驗證」。已驗證必須附證據;合理推測要說明假設;無法驗證要列出需要人工確認的步驟。最後不要自行宣布整體完成。

這句「不要自行宣布整體完成」很重要。我要的不是一份充滿綠色勾勾的報告,而是一張真的能幫我找到風險的地圖。

今日結論

AI 可以自己改考卷,但不能自己決定畢業。

最有效率的做法,是讓 ChatGPT 或 Codex 先處理可計算、可搜尋、可重複的檢查,再把需要情境、責任與真人感受的部分交回人手上。AI 負責把問題找快一點,人類負責決定這個答案能不能真的拿去用。

明天,我要繼續驗收另一個常被忽略的地方:AI 附了來源,就代表資料可靠嗎?


上一篇
Day 2|AI 有做完,但真的有照題目嗎?
下一篇
Day 4|AI 有附來源,就能直接信嗎?
系列文
《AI 說完成,我偏要驗收:ChatGPT × Codex 的 30 天成果查核實驗》 共 14 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中
0
lin1015
iT邦新手 5 級 ‧ 2026-09-12 12:33:09

對了,剛剛漏講一招:不必每次都從頭人工重驗,可以先請 AI 標出「無法驗證」與「高風險」項目,再抽查其餘內容。省時間的關鍵不是少檢查,而是把人工留給最需要判斷的地方。

0
lin1015
iT邦新手 5 級 ‧ 2026-09-12 12:33:19

我參加過不少競賽後才發現,企畫排版整齊、章節齊全,只能算第一關。真正容易失分的往往是策略沒有接回題目,或數據看似合理卻支撐不了結論。這種判斷,我到現在都不敢只交給 AI 自己打勾。

0
lin1015
iT邦新手 5 級 ‧ 2026-09-12 12:33:29

如果只能選一項,你最不放心讓 AI 自己驗收什麼?是數據、引用來源、企畫邏輯、程式功能,還是文章公開後會不會被誤解?想看看大家心中的「人工必驗區」是不是一樣。

0
waason
iT邦新手 5 級 ‧ 2026-09-22 08:55:28

提供一些不同的方向

要讓不同的 AI 各司其職,精準處理不同類型的資料檢查,最有效的方法是建立「AI 代理路由(Agentic Routing)架構」,並針對每一條分支進行參數與上下文的微調。
你不應該用同一個大模型、同一套設定去處理所有事情,而是根據資料屬性進行分流與定制化。

1. 建立 AI 分流架構 (Model Routing)

不同資料類型需要指派給不同專長的 AI。這通常透過一個輕量級的「分類器(Router)」來分發任務,讓最合適的模型處理對應的資料:

  • 結構化資料(表單、JSON、關鍵字): 交給輕量模型或基於規則的系統。檢查重點是格式正確性與欄位有無遺漏,不需要發散思考。
  • 非結構化文字(申論題、企劃書): 交給高推理能力的大型語言模型。檢查重點是邏輯連貫性與觀點深度,需要賦予詳細的評分量表(Rubrics)。
  • 數理與程式碼: 必須指派給專門訓練過邏輯與語法的 Code 模型,並搭配沙盒執行環境(Sandbox),讓 AI 不只「看」程式碼,還能實際「跑」出結果來驗證。
  • 多模態資料(圖表、手寫稿): 需啟用視覺模型(Vision Model),重點在於空間關係與物件辨識。

2. 針對性調整手段 (Tuning Strategies)

資料分流後,必須透過以下三種方式「鎖緊」AI 的檢查標準,確保它符合你的驗收期待:

A. 參數控制 (Parameter Tuning)

模型本身的隨機性必須受到嚴格控管。

  • Temperature (溫度) 的設定: 當檢查事實、數學或程式碼時,必須將溫度設定為 0,讓輸出絕對一致、消除幻覺與隨機性。若要檢查「創意寫作」或給予「風格改寫建議」,則可微調至 0.3 - 0.5,讓 AI 能提出更有彈性的修改建議。
  • 強制結構化輸出: 利用 JSON Mode 或要求特定輸出格式,強制 AI 必須填寫「錯誤類別」、「扣分理由」與「建議修改」,防止 AI 只給出模糊的評語。

B. 提供基準與外部知識 (Grounding)

AI 需要有對照標準,才能判斷對錯。

  • Few-Shot Prompting (少樣本學習): 直接在提示詞中給 AI 示範。例如:「這是一篇滿分作文的範例,這是一篇離題作文的範例。請根據這些標準評估以下文章」。有了錨點,AI 的給分標準就會大幅收斂。
  • RAG (檢索增強生成): 當檢查企業內部文件或法規時,必須將「公司最新規定」或「標準答案」做成資料庫,要求 AI 「僅能基於提供的參考資料進行比對」。這能有效防止 AI 用網路上看過的過期資訊來進行錯誤糾正。

C. 流程與防線機制 (Guardrails & Consensus)

針對高風險的檢查(如期末考卷或正式合約),不應依賴單一 AI 的單次輸出。

  • 多模型共識決 (Multi-Agent Consensus): 讓模型 A 與模型 B 同時檢查同一份資料。如果兩者判斷一致,則自動通過;如果兩者給分差異過大,則將該筆資料標記為異常。
  • Human-in-the-loop (人類介入): 系統不自動給出最終裁定,而是由 AI 產出「疑點標註報告」,將可能有問題的段落高亮標示,最終由人類專家進行確認,結合人類的脈絡理解與 AI 的地毯式搜索。
lin1015 iT邦新手 5 級 ‧ 2026-09-22 15:14:44 檢舉

謝謝補充,這個方向把文章中的「依風險分工」,進一步延伸成了系統化的模型路由。尤其是程式碼搭配沙盒實跑、文件用 RAG 對照最新規範,以及模型意見分歧時轉交人工,我很認同。

不過我會再保留兩道防線:Temperature 設為 0 可以降低隨機性,但不代表輸出一定完全一致,也不能直接消除幻覺;多個模型得出相同答案,也可能只是共享同一個盲點。因此我會把「模型共識」當成風險判斷訊號,而不是通過驗收的證明,最後仍要求附上資料來源、執行結果或可重現的檢查紀錄。

這也讓我想到,問題可能不只是「該用哪個 AI」,還包括「這項工作能用什麼證據驗證」以及「什麼情況必須轉交人工」。謝謝你提供這個不同方向,之後很適合再整理成一張「資料類型 × 驗證工具 × 人工介入條件」的對照表。

我要留言

立即登入留言